豆包+即梦+可灵:30分钟做出一集AI短剧,完整流程+提示词模板

豆包即梦可灵AI短剧制作流程

先说结果
豆包写剧本 + 即梦出分镜图 + 可灵图生视频 + 剪映合成,四款免费工具,30 分钟就能做出一集 1 分钟的 AI 短剧。核心是"结构化指令锁死剧本质量 + 垫图锁 Seed 保证角色一致 + 交叉并行提升效率"。本文给出完整四步流程和三套可直接复制的提示词模板,跟着做就能出片。

一、为什么是这三款工具

抖音、视频号上那些画风复古、色调像老电影、剧情堪比悬疑片的 AI 短剧,不是专业团队花几十万做的,而是普通人用免费 AI 工具"拼"出来的。

工具 负责环节 核心优势
豆包 剧本 + 分镜脚本 结构化指令 10 秒出分镜,台词口语化调整
即梦 分镜图片生成 垫图 + 固定 Seed 值,主角长相一致不穿帮
可灵 图生视频 国产之光,物理规律理解好,手指不乱长
剪映 配音 + 剪辑 + 字幕 AI 配音、自动字幕、BGM 音效一站式,全免费

二、第一步:豆包写剧本,10 秒出分镜

写剧本最头疼,但豆包就是你的灵感榨汁机。别让它自由发挥,要用"结构化指令"锁死质量

1
给角色设定:你是一位擅长短视频节奏的编剧,尤其擅长怀旧、悬疑题材。
2
明确任务:生成一个 1 分钟 AI 短剧脚本,题材为"城中村传闻",背景设定在 90 年代末。
3
锁死要求:分镜数 5 个镜头;开头 3 秒必须出现"年代感钩子"(老电视机雪花声、老式电话铃声);结尾留悬念;每个镜头包含【景别】【画面描述】【台词】。

粘贴后,豆包 10 秒就会吐出一份带分镜的脚本。如果觉得台词太文艺,加一句"台词口语化,像街坊邻居聊天",它立马改得接地气。

三、第二步:即梦出图,10 分钟搞定 5 张电影级分镜

有了剧本,下一步是把文字变画面。即梦的"图片生成"是核心,但秘诀在于"垫图" + "固定 Seed 值",保证主角长相一致,不穿帮。

1
生成主角定妆照:用详细提示词生成主角正面高清图,包含五官、发型、服装、光影、画风。
2
保存参考图 + 锁定 Seed:生成满意的图后,上传到即梦"参考图"功能,让系统记住 Seed 值。后续所有镜头都锁定这个值。
3
逐镜生成分镜图:每个镜头用"画面主体 + 场景 + 光影风格 + 画质 + 镜头语言"的提示词公式,5 个分镜 10 分钟搞定。
提示词公式
画面主体 + 场景 + 光影风格 + 画质 + 镜头语言

示例:一个穿白色背心的中年男人,国字脸,头发微乱,眼神疲惫不安 + 城中村出租屋,傍晚,窗外老式居民楼和交错天线 + 电影级光影,暗部偏暖黄,高光带褪色感,像老照片 + 8k,超现实,胶片颗粒感 + 平视角度,略带手持感。

四、第三步:可灵图生视频,2 分钟让静态图动起来

图片有了,就差动起来。可灵是国产之光,对物理规律理解极好,手指不会乱长。

1
打开可灵图生视频,上传分镜图片。
2
粘贴动作提示词:描述人物动作、环境变化、镜头运动、背景音。
3
点击生成:5 秒视频约 2-3 分钟生成。
提速技巧:交叉并行
可灵生成一个镜头约 2-3 分钟,这 10 分钟里别干等——直接去即梦处理下一个镜头的图片。两个工具交叉并行,效率翻倍。等可灵出完第一个视频,即梦的第二张图也做好了,无缝衔接。

五、第四步:剪映合成,5 分钟出成片

素材到手,进剪映。按"自动踩点 → AI 配音 → 关键帧微调 → BGM"四步走。

1
自动踩点:导入素材,点击"音频 → 踩点 → 自动踩点",把视频对齐节奏点。
2
AI 配音:用剪映"文本朗读"功能,选"解说男声"或"怀旧电台风",情绪瞬间拉满。
3
关键帧微调:如果视频太静,给素材打上"缩放"或"轻微旋转"关键帧,模拟手持呼吸感,质感直接提升一个档次。
4
BGM + 音效:搜"怀旧悬疑"配乐,音量调低至 20%,不抢戏但烘托氛围。加环境音效(电视声、狗叫声、脚步声)增强代入感。

导出,上传,完活儿!

六、三套万能提示词模板(直接复制)

模板 1 豆包 · 结构化分镜剧本
角色设定:你是一位擅长短视频节奏的编剧,尤其擅长怀旧、悬疑题材。

任务:帮我生成一个1分钟AI短剧脚本,题材为"城中村传闻",背景设定在90年代末。

要求:
1. 分镜数:5个镜头。
2. 结构:开头3秒必须出现"年代感钩子"(比如老电视机雪花声、老式电话铃声),结尾留悬念。
3. 格式:每个镜头需包含【景别】、【画面描述】、【台词】。
4. 台词口语化,像街坊邻居聊天,不要书面语。
模板 2 即梦 · 电影级分镜图
画面主体:一个穿白色背心的中年男人,国字脸,头发微乱,眼神里带着疲惫和不安。

场景:城中村出租屋,傍晚,窗外是老式居民楼和交错的天线,墙上有旧海报和挂历。

光影风格:电影级光影,暗部偏暖黄,高光带一点褪色感,像老照片。

画质:8k,超现实,胶片颗粒感,光影层次丰富。

镜头语言:平视角度,略带手持感,突出真实和压抑。

(生成满意后,右键复制图片,上传到即梦"参考图"功能,锁定Seed值,后续所有镜头共用)
模板 3 可灵 · 图生视频动作指令
男人缓缓转过头,看向窗外,窗外的老式路灯闪烁了一下,他手里夹着的烟灰掉落。镜头缓慢推近,背景音有远处模糊的电视声和狗叫声。

(通用公式:人物动作 + 环境变化 + 镜头运动 + 背景音效,动作越简单成功率越高)

七、新手避坑指南:最常犯的 3 个错

避坑提醒
1
角色不一致(最头疼):每次生成新图时,必须用垫图功能并锁定 Seed 值,否则主角长相会变。先做 1 张主角定妆照,全程参考。
2
画面太新没质感:在提示词里加"褪色、胶片颗粒、旧化效果、暖黄暗部"等关键词,年代感和电影质感会好很多。
3
动作不连贯:可灵生成多个片段后,在剪映里用"叠化"转场,0.3 秒就行,看起来更丝滑。单镜头动作不要复杂,多拆短镜头。

八、效率翻倍的 5 个进阶技巧

1
交叉并行:可灵生成视频时,去即梦做下一张图,两个工具同时跑,30 分钟出片的核心。
2
先批量出图再转视频:先把所有分镜静态图全部生成,确认人物没问题再批量转视频,避免做到一半发现角色崩了浪费算力。
3
单镜头不超过 10 秒:太长容易出现肢体扭曲、人脸崩坏,5-8 秒最佳,多拆短镜头用转场拼接。
4
2-3 个主角最佳:不要一集做多个人物,人物越多变脸概率越高,新手先从 2 人单一场景练手。
5
先做 60 秒小样测试:先做 1 集 60 秒小样,测试角色画风和流程,跑通后再批量生产系列剧,避免大规模返工。

九、一句话收个尾

观众看的不是 AI,是"故事"和"氛围"。当你用 AI 把那些现实中拍不出来的年代细节、氛围感变成画面时,这种视觉冲击就是最大的流量密码。豆包写剧本、即梦出图、可灵动起来、剪映合成——30 分钟,就是你弯道超车的开始。

作者声明:本作品含 AI 生成内容